Meta
2026-08-01 19:22:43Meta论文指出强化学习代码优化受噪声制约并推出DMC-Optim基准
Meta AI FAIR 团队于 7 月 29 日发布论文称,强化学习用于代码速度优化时,受到时序测量噪声大和奖励稀疏等问题影响,标准算法表现不稳定。团队提出 DMC-Optim 基准,通过重建训练反馈系统,在离线模拟器中同时引入正确性与执行速度奖励,并提供可控噪声环境。测试中,Qwen 2.5 7B 通过率由 18.0% 升至 31.3%,CWM 32B 由 30.7% 升至 50.4%。
320

